Lors de son apprentissage, l'agent cherche à trouver la stratégie optimale qui lui permet de remporter le plus de gain. Les autres stratégies ne sont pas aussi interessantes.
On peut donc définir une fonction de valeur d'état optimale, qui permet de spécifier l'ensemble des valeurs maximales des états de l'environnement. De même, on peut définir une fonction de valeur d'action optimale, qui permet de spécifier l'ensemble des actions optimales à prendre sur chaque état de l'environnement. Les fonctions optimales sont marquées d'un asterix et sont données par les formules suivantes:
Fonction de valeur d'action optimale:
Fonction de valeur d'état optimale:
Les équations précédentes expriment le fait que la valeur optimale d'un état lorsque l'agent suit la stratégie $\pi$ doit être égale au revenu maximum que peut obtenir l'agent en choisissant les meilleures actions.